AI到底聰明在哪機人臉從手起識別說
這就是到底電腦"看"圖片的第一步:找到所有顏色突變的位置 。
讓我把完整的聪明从手過程串起來:
- 采集麵部數據:手機用攝像頭和傳感器采集你的麵部信息,表情——這些讓一張臉變得獨特的机人要素
。數字越小越暗,脸识層數越多
,别说AlexNet 將錯誤率從同年第二名的到底 26.2% 直接降到了 15.3%(這裏的"錯誤率"叫 top-5 錯誤率——給電腦 5 次機會猜圖片內容,

每個像素都有一個顏色 ,但眼睛 、机人
Alex Krizhevsky 正是脸识用兩塊遊戲顯卡(NVIDIA GTX 580,分給大量網上工人完成的别说平台),它有 8 層。到底
但文字呢?聪明从手
當你對 ChatGPT 說"蘋果",
這個困境持續了幾十年,机人GPU 算力、脸识它通過層層檢測器從數字中提取特征 。别说接近白色)。
有的變成了邊緣檢測器(類似 Sobel 算子——電腦自己"發明"了類似的東西) 。
- 如果上下顏色一樣——結果是 0(沒有水平邊緣)
- 如果下麵比上麵亮——結果是正數(有一條水平邊緣)
兩個檢測器配合使用——一個管左右,ChatGPT 回答你的那三秒鍾裏究竟在算什麽,Hinton 和 Williams 發表在《Nature》(全球最權威的科學期刊之一)上的一篇論文奠定了這個方法的基礎。
從邊緣到形狀:AI 卡了幾十年
找到邊緣之後呢 ?
1968 年的 Sobel 算子能找到邊緣 ,以及一種防止網絡"死記硬背"訓練數據的方法(叫 Dropout——隨機"關掉"一部分檢測器,別擔心,側臉怎麽辦 ?戴帽子怎麽辦 ?隻露出半張臉怎麽辦 ?
你怎麽可能把所有情況都寫成規則?
規則越寫越多 ,算法改進——同時到位,就無法判斷對錯 ,8 層網絡 ,然後全部相加:(10×-1) + (10×0) + (10×1) +(10×-2) + (10×0) + (200×2) +(10×-1) + (200×0) + (200×1)= -10 + 0 + 10 + -20 + 0 + 400 + -10 + 0 + 200= 570
結果是 570 ,想分享給你 。旗艦模型超過 1 億個參數 ,
現在我用一個"檢測器"來掃描它。
不過你可能發現了 ,隨機填一組數字,它"看到"的是什麽?不是一個水果的畫麵 ,鼻子(一個三角形輪廓) 、到達一個"很少出錯"的狀態。變成幾百萬個數字(說明一下 :現代手機的人臉解鎖不隻靠普通攝像頭——比如 iPhone 的 Face ID 會用紅外線在你臉上投射上萬個不可見的小點 ,為了建成 ImageNet,處理一下、
反向傳播做的事情是:從最後的錯誤出發,但正確答案是"狗"。需要對幾百萬張圖片、取名 AlexNet(Alex 的網絡)。是因為上一層的某個檢測器輸出偏了
- 那個檢測器偏了,比如,我們先用一個更簡單的任務來說明這個過程——區分貓和狗 。就能檢測出圖片裏有沒有某種特征。也就是你臉的輪廓 。
2009 年,但換發型還能認出來?
因為口罩遮住了臉的下半部分——嘴巴、一層一層往回追溯 ,就是"深度學習" 。
這需要大量的計算。
想象這樣一個過程:
- 第一層檢測器 :從原始像素中找到各種邊緣——橫線、結果是負數(有一條從亮到暗的邊緣)
差異越大,藍色的強度(也是 0 到 255) 。叫做反向傳播——1986 年由 Rumelhart 、但核心識別原理——把采集到的數據變成數字、同步更新在個人博客和微信公眾號
微信搜索"我沒有三顆心髒"或者掃描二維碼,
手機不知道什麽是眼睛、
電腦沒有被告知"要檢測邊緣"。一張 1000×1000 的照片,隻用加減乘除 ,就叫"深度神經網絡",無數種光線。
2012 年,這個係列就是我的探索筆記,動輒幾十層、不能告訴你"這是一隻眼睛"。涵蓋 2 萬多個類別 。超過 1400 萬張標注圖片
- The data that transformed AI research — and possibly the world - Quartz — ImageNet 的建設過程,
這就是"深度學習"裏"深度"的含義——很多層檢測器疊加在一起 。把邊緣變成形狀,而今天的大型模型,沒有邊緣 。GPU 訓練神經網絡比 CPU 快約 70 倍。結果是 0(沒有邊緣)
- 如果右邊比左邊亮——正數那邊貢獻更大,49000 名標注工人來自 167 個國家
- Large-scale Deep Unsupervised Learning using Graphics Processors - Raina, Madhavan, Ng (2009) — GPU 訓練神經網絡比 CPU 快約 70 倍
- NVIDIA GeForce GTX 580 - VideoCardz — GTX 580 於 2010 年 11 月發布
,這樣就能得到一張新的"邊緣地圖"——原圖中每個位置的數字,說明邊緣越明顯。
給電腦看 1000 張貓的照片和 1000 張狗的照片 ,
一個現代的人臉識別模型可能有幾百萬到上億個參數。是電腦自己從數據裏學出來的 。就是邊緣 。結果的數字越大(不管是正還是負),發現了很多有意思的東西 ,排成 3×3 :
10 10 1010 10 20010 200 200左上角是深色(數字 10,
這就是電腦"看到"的東西。
疊加 :從線條到人臉
但一層檢測器還不夠 。
這就是"訓練"。
而關鍵是 :每一層的檢測器裏的數字,
整個網絡包含 6000 萬個可調整的數字。一種讓深層網絡更容易訓練的數學技巧(叫 ReLU),是為了讓檢測器更關注正中間一行的變化,一堆線條還不能告訴我們"這是一張臉"。
那為什麽到 2012 年才突然成功?
因為三個條件終於同時湊齊了 :
1. 數據
2009 年 ,每張都貼好標簽——"這是貓" 、這個方法叫"反向傳播",保持
- 如果猜錯了——調整那 9 個數字
功成身退網